5سپتامبر 2023- در مطالعه‌ای که اخیراً در مجله PLoS ONE منتشر شده است، محققان chatGPT را آزمایش کردند، تا بررسی کنند که آیا این ربات می‌تواند به سوالات متداول دیابت پاسخ دهد یا خیر.

ربات ChatGPT، که مخفف Chat Generative Pre-trained Transformer است، یک ربات گفتگوی بزرگ مبتنی بر مدل زبانی است که توسط شرکت OpenAI توسعه یافته و در 30 نوامبر 2022 راه اندازی شد، این یک سیستم هوش مصنوعی است که برای پاسخ دادن به سوالات کاربران و گفتگو با آن ها، طراحی شده است.

هوش مصنوعی(AI)، به ویژهChatGPT، توجه زیادی را برای کاربردهای بالینی بالقوه به خود جلب کرده است.ChatGPT علیرغم عدم آموزش صریح برای این موضوع، میلیون ها کاربر فعال در سراسر جهان دارد. مطالعات گزارش داده‌اند که افراد برای سناریوهای کم خطر، با نرخ پذیرش بیشتر، از راه‌حل‌های مبتنی بر هوش مصنوعی پیروی می‌کنند. این امر مستلزم مطالعه بیشتر در مورد درک و استفاده از مدل های بزرگ مبتنی بر زبان مانند ChatGPT در شرایط روتین و درمان بالینی معمول است.

در مورد این مطالعه

در مطالعه ی حاضر، محققان میزان تخصص ChatGPT را در حوزه ی دیابت، به ویژه ظرفیت پاسخگویی به سؤالات رایج مرتبط با دیابت را به روشی مشابه انسان ارزیابی کردند.

محققان به طور خاص بررسی کردند که آیا شرکت کنندگان با آگاهی از دیابت از سطح کم تا متخصص دیابت می توانند بین پاسخ های ارائه شده توسط افراد و پاسخ هایی که توسط ChatGPT به سؤالات رایج دیابت نوشته شده است، تمایز قائل شوند.

علاوه بر این، محققان بررسی کردند که آیا افرادی که قبلاً با بیماران دیابتی تعامل داشتند مانند ارائه دهندگان خدمات سلامت و یا افرادی که قبلاً از ChatGPT استفاده کرده بودند، توانایی بهتری در تشخیص پاسخ های ایجاد شده توسط ChatGPT دارند یا خیر.

این مطالعه شامل یک نظرسنجی کامپیوتری بسته با الهام از آزمون تورینگ از تمام کارکنان مرکز دیابت آرهوس(پاره وقت یا تمام وقت) بود. این نظرسنجی علاوه بر سوالات مربوط به سن، جنسیت و تماس قبلی کاربران با ChatGPT، شامل 10 پرسش از نوع چند گزینه ای با دو نوع پاسخ بود که یکی توسط انسان ها و دیگری توسط ChatGPT تهیه شده بود.

 شرکت کنندگان باید پاسخ ایجاد شده توسطChatGPT  را تشخیص می دادند.

فرآیندهای پاتوفیزیولوژیک، درمان، عوارض، فعالیت بدنی و غذا همگی جزو ده سوال مورد بررسی بودند. بخش «سوالات متداول» در وب سایت انجمن دیابت دانمارک، که در 10 ژانویه 2023 مشاهده شد، شامل هشت سؤال بود. محققان بقیه ی سؤالات را برای ارتباط با مطالب خاص در وب سایت «مرکز دانش دیابت» و گزارشی در مورد فعالیت بدنی و دیابت نوع 1 طراحی کردند.

از مدل‌سازی رگرسیون لجستیک برای تجزیه و تحلیل استفاده شد و نسبت شانس ها (ORs) تعیین شد. محققان تأثیر ویژگی های شرکت کنندگان را بر نتیجه در تحلیل ثانویه ارزیابی کردند.

بر اساس شبیه‌سازی‌های دقیق، قبل از شروع جمع‌آوری داده‌ها، حاشیه عدم فرومایگی یا non-inferiority margin، از پیش تعریف 55 درصد و به عنوان بخشی از پروتکل تحقیق منتشر شد. پاسخ‌های نوشته شده توسط انسان،  مستقیماً از مطالب یا وب‌سایت‌های منبعی که محققان پرسش‌ها را در آن‌ها یافته بودند، استخراج شد.

به دلایل عملی، دو محقق، هر دو متخصص بهداشت، چند پاسخ را برای دستیابی به تعداد کلمات مورد نظر کوتاه کردند. قبل از ترکیب سؤالات، برای هر سؤالی که در پنجره‌های چت فردی پرسیده شد، زمینه به همراه سه نمونه (به طور تصادفی از 13 جفت سؤال و پاسخ انتخاب شده) به مدل زبان مبتنی بر هوش مصنوعی ارائه شد. افراد از طریق ایمیل برای شرکت در نظرسنجی دعوت شدند، که شاملURL های مخصوص افراد بود که به آنها اجازه می داد یک بار نظرسنجی را تکمیل کنند. اطلاعات بین 23 و 27 ژانویه 2023 جمع آوری شده است.

نتایج

از 311 فرد دعوت شده، 183 نفر نظرسنجی را تکمیل کردند (نرخ پاسخ 59 درصد)، که 70٪  زن بودند(129 نفر)، 64٪ قبلاً در مورد ChatGPT شنیده بودند، 19٪ از ChatGPT استفاده کرده بودند، و 58٪ (107 نفر) تعامل قبلی با بیماران دیابتی به عنوان پزشکان سلامت داشتند. مدل زبان مبتنی بر هوش مصنوعی برای ارائه پاسخ های 45 تا 65 کلمه ای برای مطابقت با پاسخ های انسانی هدایت شد. با این حال، میانگین تعداد کلمات 70 کلمه بود. با این حال، توصیه های مشاوره و سه خط اول سوالات حذف شدند و پاسخ های ChatGPT شامل 56 کلمه (متوسط) در نظر گرفته شد.

در بین 10 سوال، نسبت پاسخ های صحیح از 38٪ تا 74٪ متغیر بود. شرکت‌کنندگان در 60 درصد مواقع پاسخ‌های ایجاد شده توسط ChatGPT را به درستی شناسایی کردند، که بیش از آستانه ی non-inferiority بود. مردان و زنان به ترتیب 64 درصد و 58 درصد شانس تشخیص دقیق پاسخ تولید شده توسط ChatGPT را داشتند. افرادی که در گذشته با بیماران دیابتی تماس داشتند، 61 درصد شانس پاسخگویی دقیق به سؤالات را داشتند، در حالی که این احتمال برای افرادی که قبلاً با بیماران دیابتی تماس نداشتند، 57 درصد بود.

"استفاده قبلی از ChatGPT " قوی‌ترین ارتباط را با نتیجه(نسبت شانس 1.5) در میان ویژگی‌های شرکت‌کنندگان داشت. نسبت شانس با اندازه ی قابل مقایسه برای مدلی مشاهده شد که در آن سن بیش از 50 سال با احتمال بیشتری برای تشخیص درست پاسخ تولید شده توسط هوش مصنوعی مرتبط بود(نسبت شانس 1.3).

کاربران قبلی chatGPT و غیرکاربران به ترتیب به 67% و 58% سوالات پاسخ صحیح دادند.برخلاف فرض اولیه، شرکت‌کنندگانی که می‌توانستند بین پاسخ های ایجاد شده توسط ChatGPT و نوشته شده توسط انسان تمایز قائل شوند، بهتر از پاسخ بر اساس پرتاب یک سکه بصورت منصفانه، پاسخ دادند.

نتیجه گیری

به طور کلی، این مطالعه به عنوان یک کاوش اولیه در مورد قابلیت ها و محدودیت های ChatGPT در ارائه راهنمایی بیمار محور برای مدیریت بیماری های مزمن، به ویژه دیابت، عمل کرد. در حالی که ChatGPT، دارای پتانسیلی برای پاسخگویی دقیق به سوالات متداول بود، مشکلاتی در مورد اطلاعات نادرست و فقدان توصیه های ظریف و شخصی در پاسخ های آن مشهود بود. از آنجایی که مدل‌های زبانی بزرگ به طور فزاینده‌ای با مراقبت‌های بهداشتی تلاقی می‌کنند، مطالعات دقیق برای ارزیابی ایمنی، کارایی و ملاحظات اخلاقی آنها در مراقبت از بیمار ضروری است و بر نیاز به چارچوب‌های نظارتی قوی و نظارت مستمر تأکید می‌کند.

منبع:

https://www.news-medical.net/news/20230905/Can-ChatGPT-be-a-diabetes-consultant-Study-probes-the-potential-and-pitfalls.aspx